Adaptive Kernel Fusion for Improving the GPU Utilization While Ensuring QoS
Aker 的核心思想是: 不要只在 kernel 之间做时间共享,而是把资源互补的两个 kernel 融合成一个 fused kernel,让一个 thread block 里的不同 warps
推荐阅读: Towards High-Goodput LLM Serving with Prefill-decode MultiplexingELORA: Efficient LoRA and KV Cache Management for Multi-LoRA LLM Serving 读论文:
X@C + X@A@B 到底是不是已有系统已经处理过。这是在完成一套关于 Matmul Fusion 的笔记后,整理成的一个专题页。Matmul Fusion 的原始题目在这里:https://zhao-han.notion.site/1-Triton-34ccfdeeea6f803fa973fff139631390
这个专题页把这一组笔记放在一起,后续继续往这个文件夹里加文章时,也可以继续从这里进入。
Aker 的核心思想是: 不要只在 kernel 之间做时间共享,而是把资源互补的两个 kernel 融合成一个 fused kernel,让一个 thread block 里的不同 warps
- 参考资料 - pp018 Punica - 论文精读学习笔记 - 剖析GPT推断中的批处理效应 设计了一个CUDA内核,叫做分段聚合矩阵向量乘法(SGMV) 假设`W`的形状为`[
这个任务可以这么理解,这个矩阵乘法相加也就是LoRA的思想,下图是GPT-5.4给我的解释。 ![[./img/问题1(1):Triton矩阵乘算子融合-01.png|500]] 然后再对应看一下下面
论文:Hfusion 针对问题1之前的错误,由于理解有误,之前书写的实际上是纵向融合。题目中提到*三个算子串行执行时,算子1和算子2各自都只能用到GPU的一小部分算力,但它们仍然各自占用一次kerne
经过上一篇:算子1、3融合.md)讨论的方案,老师让我再试了试别的优化,并且我这里还进行了一些别的学习,知道了更多性能相关的知识,这里把我们的实验结果重新书写一下。 我其实这里还有不少问题: - 两个
点击在新标签页中打开 PDF{target="_blank" rel="noopener"} 大语言模型(LLM)服务必须满足预填充prefill和解码阶段decode的服务等级目标(SLO) - 预